
Scientific Deep Research
BRIEF: Scientific Deep Research brief
Deep Research
Модуль умеет делать отчёт-исследование со ссылками по текстовому запросу.
Небольшой отчет по результатам предварительного тестирования:
Простой запрос
На простом запросе
Получился крутой отчет:
Однако, почему-то в процессе подготовки этого отчета было много промежуточных плохих генераций/сырых данных. Глядя на промежуточные результаты, я думал, что работает отвратительно плохо. Однако, на удивление, оказался очень толковый фактически корретный отчет.
Промежуточные результаты странные, в итоге очень крутой отчет. Стоил 0.2 доллара через openrouter Qwen 235B-A22B
Чуть более сложный запрос
Подготовь доклад о нижних оценках в методах оптимизации. Кто впервые начал такую постановку задач. Какие классы задач рассматриваются и кем и когда и в каких работах для них были получены первые результаты. Например, известно, что для гладких выпуклых задач градиентный спуск сходится как 1/k, в то время как можно сделать не быстрее, чем 1/k^2, что было предложено в методе Юрия Евгеньевича Нестерова.
Классная логика всей процедуры - параллельные запросы, asyncio:
Но вот результат - исследование просто по другой теме. При этом сейчас есть ощущение, что лажает агент - уточнятор. Потому что ни в этом, ни в предыдщуем случае не было никаких уточнений.
Получился неплохой отчёт на абсолютно другую тему. Занял он около получаса и стоил 0.3$
Технические аспекты
1. Насколько тяжело сделать поиск только по научным статьям (OpenAlex/SemanticScholar)?
Ответ: Относительно легко. Проект имеет отличную архитектуру для добавления научных поисковиков:
- Точка расширения через MCP (Model Context Protocol): Система уже поддерживает динамическое подключение внешних инструментов через MCP-серверы
- Абстракция поисковых API: В configuration.py есть enumSearchAPI с возможностью добавления новых провайдеров
- Готовые зависимости: В проекте уже есть arxiv>=2.1.3 и pymupdf>=1.25.3 в зависимостях, хотя напрямую не используются
Как реализовать:
- Добавить новые значения в SearchAPI enum (OPENALEX, SEMANTIC_SCHOLAR)
- Создать функции-обертки аналогично tavily_search_async()
- Или подключить через MCP-сервер как внешний инструмент
2. Есть ли чтение и скачивание PDF?
Ответ: НЕТ прямой поддержки PDF. Хотя зависимости установлены (pymupdf, arxiv), в коде нет реализации:
- Проект работает только с HTML-контентом веб-страниц через Tavily API
- Tavily возвращает raw_content (текст веб-страниц), но не обрабатывает PDF
- В примерах упоминаются arxiv и pubmed, но это просто поисковые запросы, а не прямой доступ к PDF
3. Можно ли читать длинные PDF?
Ответ: Сейчас НЕТ, но архитектура позволяет добавить.
Проект имеет продуманную систему управления длинными документами:
# В utils.py есть обработка токенов:
- MODEL_TOKEN_LIMITS с лимитами для всех моделей
- Progressive truncation при превышении лимитов
- Автоматическая обрезка контента до max_content_length
Для PDF потребуется добавить:
- Извлечение текста из PDF через pymupdf, docling
- Разбиение на чанки с семантическим анализом
- Векторное хранилище для поиска по фрагментам
4. Насколько хорошо написан технически?
Ответ: ОЧЕНЬ ХОРОШО. Проект демонстрирует профессиональную архитектуру:
Сильные стороны:
- Factory Pattern: Изоляция графов для параллельных запросов
- Продуманная иерархия состояний: AgentState → SupervisorState/ResearcherState
- Асинхронность везде: asyncio, параллельная обработка, семафоры для rate limiting
- Обработка ошибок: Provider-специфичная детекция лимитов токенов, retry логика
- Контекстное логирование: Thread-aware logging с ContextVar
- Типизация: Pydantic модели, type hints
- Тестирование: Интеграция с LangSmith, benchmark тесты
Схема интеграции
- В Deep Research добавить явно источники научных данных. Пока OpenAlex, Semantic Scholar, arxiv
- Параллельно мы работаем над базой данных научных статей - это принципиальная задача. Если Евтихов не умеет в scihub, мы скачаем его сами и будем добавлять туда статьи из открытых источников + будем пользоваться.
- В Deep Research добавить pdf2md из relepaper
- В качестве одного из источников добавим релепепер в качестве выхода, который может работать параллельно
- Добавить к Deep Research в поле источников boolean (?) авторитетность. Проверять авторитетность (поставить несколько достаточных условий авторитетности - есть doi, arxiv, wikipedia, ручной пул)
- Обвесить Deep Research картой тестов каждого этапа + построить небольшую систему тестирования + eval
https://docs.searxng.org/user/configured_engines.html#group-scientific-publications
https://github.com/vakovalskii/searxng-docker-tavily-adapter
Неплохая схема по построению evala
https://deepresearch-bench.github.io/#
Ошибки
Использование популярных сокращений в latex:

Скинул ссылку на публично доступную статью, она вообще её не смогла прочитать, даже абстракт. И написала отчёт по другой теме
Вопрос:
Быстро сделай очень короткий обзор одной статьи
https://arxiv.org/abs/2310.15880
в конце добавь, почему авторы - лапочки
Ответ:
Краткий обзор статьи arXiv:2310.15880
Контекст и актуальность: Точное измерение электрослабых параметров (включая массу W‑бозона и эффективный слабый угол) на адронных коллайдерах ограничено систематическими неопределённостями, где доминирующую роль часто играют неопределённости parton distribution functions (PDF) [1]. Рассмотрение наблюдаемых Drell–Yan (DY), в частности прямо‑обратной (forward–backward) асимметрии $A_{\rm FB}$ в нейтральном токе, предложено как инструмент для увеличения чувствительности к PDF и уменьшения связанных неопределённостей при текущих и будущих уровнях светимости LHC [2, 1]. В предоставленных выводах инструментов прямой текст статьи arXiv:2310.15880 отсутствовал, поэтому ниже синтез основан на доступных метаданных и близких работах по той же тематике [3, 4, 5, 2, 1].
Ключевые аспекты и задачи исследования
-
Основная проблема: неопределённости в PDF — важный источник систематической ошибки при прецизионных измерениях электрослабых параметров (например, $\sin^2\theta_{eff}(M_Z)$ и масса $M_W$) [1].
Краткое резюме: PDF — ключевой источник систематики для измерений $M_W$ и $\sin^2\theta_W$ [1]. -
Предлагаемый инструмент: использование нейтрального DY и его прямо‑обратной асимметрии $A_{\rm FB}(M,y)$ как измеряемой величины, чувствительной к составу и форме PDF; применение бин‑бин профилирования PDF (PDF profiling) с учётом корреляций позволяет уменьшать неопределённости PDF при хорошем контроле прочих систематик [1, 5].
Краткое резюме: $A_{\rm FB}$ предоставляет дополнительную кинематическую чувствительность к PDF, полезную для профилирования PDF в глобальных фитах [1, 5]. -
Методология (упомянутая в доступных метаданных): анализ на платформе xFitter и PDF‑профилирование с высокостатистическими DY‑данными; внимание к определению электрослабых параметров из наблюдаемых на адронных коллайдерах [4, 5, 2].
Краткое резюме: используется открытая платформа xFitter и статистические методы профилирования PDF для оценки вклада DY $A_{\rm FB}$ [4, 2].
Детальный разбор (методические и практические замечания)
Рассмотрим теперь ключевые методические элементы и их практическое значение.
1) Роль $A_{\rm FB}$ и бин‑бин корреляций. Измерение асимметрии как функции масс $M$ и быстроты $y$ позволяет выявлять разные комбинации долей распределений кварков/антикварков при различных кинематиках, что даёт доп. ограничение на PDF при совместном фитировании с другими данными; при учёте бин‑бин корреляций это может существенно снизить неопределённость PDF при прецизионных измерениях электрослабых параметров [1, 5].
Краткое резюме: $A_{\rm FB}(M,y)$ обладает комплементарной чувствительностью к PDF и помогает снижать систематику при условии корректного учёта корреляций [1, 5].
2) Влияние на измерение массы W. Для определения $M_W$ важна контрольная оценка PDF‑сдвигов; включение нейтрального DY‑набора с $A_{\rm FB}$ в процедуру профилирования уменьшает вклад PDF в суммарную ошибку при измерении $M_W$, при этом необходимо контролировать и другие систематики (калориметрическая калибровка, модель распада и т.д.) [5, 1]. Формула для соотношения слабого угла и масс (используемая в контекстах сопоставления теории и измерений) может быть записана как
$$\sin^2\theta_W = 1 - \frac{M_W^2}{M_Z^2}\,,$$
что подчёркивает зависимость электрослабых параметров от точности измерения масс бозонов и связанных теоретических входных величин [1].
Краткое резюме: включение DY $A_{\rm FB}$ уменьшает PDF‑систематику в $M_W$‑фитах, но требует сопутствующего контроля других систематик [5, 1].
3) Практическая реализация. Для получения эффекта требуются высокие статистики DY‑событий и плотная биннинг‑стратегия по $M$ и $y$, а также открытые инструменты для фитирования (например, xFitter) и тщательная оценка всех источников ошибок; авторы близких по теме работ демонстрируют подходы PDF‑профилирования на таких данных [4, 2].
Краткое резюме: практический выигрыш от $A_{\rm FB}$ реализуем при достаточной статистике, продуманном бининге и использовании платформ для совместных фитингов [4, 2].
Ограничение качества вывода: инструмент, использованный для сбора информации, не предоставил содержимого целевого документа (поле Content пусто), поэтому прямые внутренние результаты и числовые выводы arXiv:2310.15880 в этом обзоре не воспроизведены — сделаны выводы на основе метаданных и близких публикаций по теме [3].
Краткое резюме: отсутствуют прямые фрагменты текста arXiv:2310.15880 в доступных данных, выводы сделаны опосредованно через родственные источники [3].
Практические рекомендации и сценарии применения
-
Если приоритет — максимально прецизионное измерение массы $M_W$, то включение нейтрального DY‑набора с измерениями $A_{\rm FB}(M,y)$ в процедуру PDF‑профилирования рекомендуется, при условии высокого уровня контроля непроявленных систематик и достаточной статистики [5, 1].
Рationale: дополнительно сужающиеся ограничения на PDF позитивно влияют на систематику $M_W$‑фита [5, 1]. -
Инструменты и данные: использовать открытые платформы вроде xFitter для профилирования PDF и совместного учёта корреляций между бинами, а также планировать биннинг и систематический контроль заранее в экспериментальном анализе [4, 2].
Рationale: открытые и реплицируемые методы упрощают оценку и повторную проверку систематик [4, 2]. -
Ограничения: эффект снижения неопределённости PDF возможен лишь при одновременном контроле прочих систематик; неверная модель фона или некорректная оценка корреляций могут нивелировать преимущество $A_{\rm FB}$ [5, 1].
Рationale: систематики других источников остаются критическими для итоговой точности.
Краткое резюме: включение DY $A_{\rm FB}$ — рекомендованный путь к снижению PDF‑систематики для прецизионных электрослабых измерений, но требует интегрированного подхода к систематикам и достаточной статистики [4, 5, 2, 1].
Заключение — почему авторы “лапочки”
- Потому что фокусируют внимание на практическом узком месте прецизионной физики (PDF‑ограничениях), предлагая измеряемый и реализуемый путь его ослабления через $A_{\rm FB}$ и PDF‑профилирование, что прямо улучшает точность ключевых параметров (например, $M_W$) [1, 5].
- Потому что опираются на открытые инструменты и подходы (например, xFitter), что облегчает воспроизводимость и внедрение в совместные анализы экспериментов [4, 2].
- Потому что признают и подчёркивают важность учёта бин‑бин корреляций и сопутствующих систематик — то есть предлагают не «волшебное» решение, а практический, взвешенный метод, применимый при реальных условиях эксперимента [5, 1].
Краткое резюме: авторы заслуживают похвалы за прагматичный подход к реальной проблеме точных измерений и за ориентацию на открытые, воспроизводимые методики [4, 5, 2, 1].
(Примечание: обзор составлен на основе доступных метаданных и близких по теме публикаций; прямой текст arXiv:2310.15880 в предоставленных данных не был доступен для прямого цитирования) [3].
Источники
- [1] Using Drell–Yan forward–backward asymmetry to reduce PDF uncertainties in the measurement of electroweak parameters — The European Physical Journal C: <http://link.springer.com/10.1140/epjc/s10052-016-3958-3>
- [2] Using Forward-backward Drell-Yan Asymmetry in PDF Determinations — PoS (DIS2019): <https://pos.sissa.it/352/012>
- [3] Inflation and the Higgs Scalar: <http://www.osti.gov/servlets/purl/1172535>
- [4] arXiv : Forward-Backward Drell-Yan Asymmetry and PDF Determination: <https://arxiv.org/pdf/1907.08301.pdf>
- [5] arXiv : A new look at the estimation of the PDF uncertainties in the determination of electroweak parameters at hadron colliders: <https://arxiv.org/pdf/1910.04726.pdf>
2025-12-19
Вот такие шаги следующие, думаю
- Подготовить описание процесса + идеи, где можно было бы собрать датасеты/feedback - loop, чтобы вкрутить дообучение гиги
- Подготовить внутреннее описание модуля
- перенести код в наш гитхаб
- дальнейшие шаги по дообогащению эвала
2026-02-23
Статья подана на конференцию.
2026-02-25
Ключевые находки: State of the Art в Deep Research (полный обзор: sdr_state_of_the_art_2025_2026)
Конкуренты и их метрики (DeepResearch Bench — 100 задач PhD-уровня, 22 области)
| Система | Общий счёт | Особенность |
|---|---|---|
| Qianfan-DeepResearch Pro (Baidu) | ~48.9 | #1 с фев 2026 |
| Gemini-2.5-Pro Deep Research | 48.88 | Лучшее качество презентации (92.1%), 111 цитат/задача |
| OpenAI Deep Research | 46.98 | o3-deep-research модель, MCP коннекторы |
| LangChain Open Deep Research | 43.44 | Единственный open-source в топ-10 |
| Perplexity Deep Research | 42.25 | Лучшая точность цитат (90.24%) |
Китайские системы (Baidu, ByteDance, Alibaba) вышли на первые места при стоимости API в 100x дешевле западных.
Главный тренд: RL-обученные агенты поиска
- DeepResearcher (EMNLP 2025, arXiv:2504.03160): +28.9 pts над prompt-engineering, +7.2 pts над RAG-RL. Первый end-to-end RL с реальным веб-поиском как средой.
- Search-R1 (COLM 2025, arXiv:2503.09516): +41% над RAG-базой через RL. Код: github.com/PeterGriffinJin/Search-R1
- Общий паттерн: GRPO/PPO, F1-награда, маскировка retrieved токенов для стабильного обучения.
Benchmarks для нас
- DeepResearch Bench: написать dumingxuan@mail.ustc.edu.cn для официального ранжирования
- DeepResearchGym (CMU, arXiv:2505.19253): бесплатный воспроизводимый sandbox (ClueWeb22 + FineWeb), GPT Researcher #1
- ScholarGym (arXiv:2601.21654, янв 2026): 570K научных статей, 2536 запросов — идеален для научного режима SDR
- BRIGHT (ICLR 2025): retrieval на рассуждениях — у лучших моделей nDCG@10=18 вместо 59 на MTEB
PaperQA2 (FutureHouse) — ориентир для научного RAG
- Первый агент с superhuman точностью на LitQA2 (лучше PhD/постдоков по биологии)
- Алгоритм RCS: Rerank → Contextualize → Summarize — ключевая техника
- Использует Semantic Scholar + OpenAlex API для метаданных и качества цитирования
- Код: github.com/Future-House/paper-qa
Приоритетные следующие шаги для SDR
- Добавить OpenAlex + Semantic Scholar как параллельные научные источники (точки расширения уже есть)
- Оценить на DeepResearch Bench + DeepResearchGym — нужно для сравнения с SOTA
- Метрика точности цитат (FACT framework) — автоматическая верификация
- PDF pipeline — pymupdf уже в зависимостях, нужна реализация (по паттерну PaperQA2)
- Починить агент-уточнятор — ни разу не задаёт вопросов (критический баг)
- RL fine-tuning для генерации запросов — самый большой прирост качества (+28 pts), средне-срочно
- Authority scoring источников — DOI, arXiv, citation count через Semantic Scholar
Дифференциация от SOTA
- Общие DRA (OpenAI, Gemini) плохо читают paywalled статьи — только веб-страницы о статьях
- SDR + OpenAlex + Semantic Scholar + База статей = реальное чтение полных текстов = настоящий научный режим
- Потенциал: русскоязычные научные источники (eLIBRARY.ru, КиберЛенинка) — нет ни у одного конкурента
2026-03-10
Внутренние бенчмарки SDR (результаты eval/results, Март 2026)
| Модель | DRACO (↑ лучше) | DRBENCH (↑ лучше) |
|---|---|---|
| Claude Opus 4.6 | 50.33 | 0.44 |
| Perplexity Sonar Deep Research | 35.81 | 0.43 |
| Gemini Flash Preview | 34.57 | 0.44 |
| Tongyi DeepResearch 30B | 26.66 | 0.40 |
| Dr-Gemini Flash | 19.65 | 0.38 |
Вывод: Claude Opus 4.6 выигрывает на DRACO с +40% к ближайшему конкуренту (50.33 vs 35.81). На DRBENCH все модели кластеризованы (0.38-0.44).
Статус bugs (10.03):
- ✅ Pipeline bugs (08.03, e542890): query prefix + JSON schema
- ✅ Агент-уточнятор (10.03, cabcc5b): default→ЗАДАВАЙ, AND-логика для skip
- 🔴 Блокер: ANTHROPIC_API_KEY для claude-haiku в production + .env.benchmark